
AI eval ツール 10 選 — Promptfoo / Autoevals / Evalite / Langfuse / DeepEval / Ragas / Inspect AI / OpenAI Evals / lm-eval-harness / Phoenix を使い分ける
2026年4月5日
AI eval ツールは 2025-2026 年に乱立したが、どれを選ぶべきか判断軸が整理されていない。本稿は代表 10 本 (Promptfoo / DeepEval / LangSmith / Phoenix / Braintrust / Inspect AI / OpenAI Evals / Weave / Ragas / Langfuse) を OSS/商用、CLI/SDK/UI、観測/評価の軸で分類し、プロジェクトの段階ごとに最初に手に取るべき 1 本を提案する。各ツールの詳細記事へのリンク付き。
tech-blogAI evaluationツール比較

DeepEval: pytest 感覚で LLM を評価する OSS
2026年3月8日
DeepEval は Confident AI が開発する OSS の LLM 評価フレームワークです。pytest 互換の記法で G-Eval や RAG メトリクス、hallucination、bias、toxicity などを計測でき、CI/CD にそのまま組み込めます。本記事では開発元、最小動作例、ハマりポイント、Promptfoo との棲み分け、商用版 Confident AI との関係まで、Python エンジニア向けに整理します。
tech-blogAI evaluationDeepEval

Promptfoo で LLM を YAML で回帰テストする — AI eval の実装者視点
2026年3月5日
Promptfoo は LLM アプリケーションを YAML 一枚で回帰テストできる OSS の CLI ツールです。本稿では Promptfoo が何を解決するのか、最小動作例、llm-rubric や Red Team 機能、DeepEval や LangSmith との違い、よくあるハマりポイントを実装者向けにまとめます。2026 年に OpenAI 傘下に入ったあとの位置づけも整理しました。
tech-blogAI evaluationPromptfoo